HN
Hacker News • 54일 전
IMP 9
트랜스포머 QKV 투영 생략 연구
트랜스포머 모델의 핵심인 어텐션(Attention)에서 반드시 필요한 Query, Key, Value(QKV) 세 개의 투영(Projection)을 공유하거나 생략해도 모델 성능을 유지할 수 있다는 연구 결과입니다. 특히 Key와 Value를 하나로 합치는 방식은 추론 시 메모리 캐시를 최대 96.9%까지 획기적으로 줄이면서도 언어 모델의 성능 저하를 최소화하여, 스마트폰 등 엣지(Edge) 기기에서의 AI 추론 활용을 크게 앞당길 수 있는 실용적인 기여를 합니다.
트랜스포머 최적화 메모리 최적화 온디바이스 AI